1
El Cambio de Paradigma: De Modelos Específicos de Tareas a LLMs
PolyU COMP5511Lecture 10
00:00

Evolución del PLN: De la IA Fragmentada a los Modelos Fundacionales

Definiciones

  • IA Fragmentada: Una era definida por arquitecturas neuronales discretas y especializadas, diseñadas para tareas individuales como el etiquetado de secuencias o la clasificación.
  • Modelo Fundacional: Una arquitectura de transformador monolítica y unificada que trata todos los problemas lingüísticos como una secuencia generativa de texto a texto $x \rightarrow y$.

Conceptos Clave

  • Consolidación Arquitectónica: Históricamente, el PLN requería canales de procesamiento hechos a medida (Bi-LSTM para NER, CNN para sentimiento). Los LLM colapsan estos silos en una única columna vertebral donde los mismos pesos se utilizan para cada tarea.
  • La Interfaz Unificada: Los LLM reemplazan las "cabezas de salida" especializadas (p. ej., Softmax de 3 clases) con una interfaz de lenguaje natural. Las entradas y salidas son siempre cadenas de texto, lo que permite al modelo interpretar la intención en lugar de el formato.
  • Transferencia de Conocimiento: Los modelos tradicionales eran "tabula rasa" para cada tarea. Los LLM priorizan la Generalización Primero, donde las tareas específicas son meras aplicaciones de una representación interna robusta y preexistente del lenguaje.

Contexto Histórico

  • Antes de 2018: El aislamiento de tareas requería entrenar modelos distintos con diferentes funciones de pérdida $\mathcal{L}_{task}$.
  • Era Moderna: El paradigma "Texto a Texto" permite que un único modelo (p. ej., Llama-3) cambie de tarea mediante indicaciones zero-shot o few-shot.
IA Tradicional$f_{NER}(x) \rightarrow y_{labels}$$f_{Sent}(x) \rightarrow y_{class}$$f_{Trans}(x) \rightarrow y_{seq}$Era de los Modelos FundacionalesIndicación + $x$LLM$f(p, x) \rightarrow y_{str}$Cadena $y$
Comparación de Implementación en Python